编程 开发 开源 架构
上个月 MiniMax 刚用 M3 在文本模型上刷了一波存在感,今天 H3 来了——一款全模态生成模型,而且承诺几天内社区驱动权重。 先看能力边界。H3 接受文本、图像、视频、声音任意组达成协作为输入(它叫多模态上下文),输出带原生双声道音频的视频,最高 15 秒 2K 分辨率。举个例子:扔进去一段参考视频(取它的希区柯克运镜)、一张人物图片、一段歌声录音,用自然语言告诉模型你要什么——H3 自己...